1
การเปลี่ยนกระบวนทัศน์: จากโมเดลเฉพาะงานสู่ LLMs
PolyU COMP5511Lecture 10
00:00

วิวัฒนาการของ NLP: จาก AI แบบแยกส่วนสู่ Foundation Models

นิยาม

  • AI แบบแยกส่วน: ยุคที่ใช้สถาปัตยกรรมโครงข่ายประสาทเทียมแบบแยกส่วนและเฉพาะทาง ซึ่งถูกออกแบบมาสำหรับงานเฉพาะแต่ละอย่าง เช่น การติดฉลากลำดับ (sequence labeling) หรือการจำแนกประเภท
  • Foundation Model: สถาปัตยกรรม Transformer แบบรวมศูนย์ทั้งหมด ซึ่งมองปัญหาทางภาษาทุกอย่างเป็นลำดับข้อความแบบ generative แบบ text-to-text $x \rightarrow y$

แนวคิดหลัก

  • การรวมโครงสร้างสถาปัตยกรรม: ในอดีต NLP ต้องใช้ไปป์ไลน์ที่ออกแบบเฉพาะ (Bi-LSTM สำหรับ NER, CNN สำหรับการวิเคราะห์ความรู้สึก) LLMs ลดความซับซ้อนของระบบแยกส่วนเหล่านี้ให้เป็นโครงสร้างหลักเดียว โดยใช้น้ำหนักเดียวกันสำหรับทุกงาน
  • อินเทอร์เฟซแบบรวมศูนย์: LLMs แทนที่ "output heads" เฉพาะทาง (เช่น Softmax แบบ 3 คลาส) ด้วยอินเทอร์เฟซภาษาธรรมชาติ ข้อมูลนำเข้าและผลลัพธ์เป็นสตริงเสมอ ทำให้โมเดลสามารถตีความ เจตนา มากกว่า รูปแบบ.
  • การถ่ายทอดความรู้: โมเดลแบบเดิมเป็น "กระดานเปล่า" (tabula rasa) สำหรับแต่ละงาน LLMs ให้ความสำคัญกับ การวางนัยทั่วไปก่อนโดยงานเฉพาะแต่ละอย่างเป็นเพียงการประยุกต์ใช้การแทนค่าภายในภาษาที่แข็งแกร่งซึ่งมีอยู่เดิม

บริบททางประวัติศาสตร์

  • ก่อนปี 2018: การแยกงานตามหน้าที่ต้องฝึกโมเดลที่แตกต่างกันด้วยฟังก์ชัน loss ที่ต่างกัน $\mathcal{L}_{task}$
  • ยุคปัจจุบัน: กระบวนทัศน์ "Text-to-Text" ช่วยให้โมเดลเดียว (เช่น Llama-3) สามารถสลับงานได้ผ่าน zero-shot หรือ few-shot prompting
AI แบบดั้งเดิม$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$ยุค Foundation ModelPrompt + $x$LLM$f(p, x) \rightarrow y_{str}$สตริง $y$
การเปรียบเทียบการใช้งานด้วย Python